Utiliser une intelligence artificielle en locale
Un guide à destination des chercheurs, enseignants chercheurs et personnels de la recherche qui souhaitant exploiter des modèles LLM en toute confidentialité, sans envoyer de données vers des serveurs externes.
🖥️ Priorité Windows · compatible macOS et Linux | 🔒 Données 100 % locales | 🎓 Niveau : débutant à intermédiaire
1. Introduction : qu'est-ce qu'une IA locale ?
Les assistants IA grand public — ChatGPT, Claude, Gemini — fonctionnent sur des serveurs distants. Chaque question, chaque document que vous leur soumettez transite par Internet et est traité dans des centres de données aux États-Unis, en Europe ou ailleurs dans le monde. Pour des données sensibles (données de santé, données à caractères personnels, documents visant un public réservé, etc.), cette solution n'est pas conforme à notre réglementation.
Une IA locale (ou LLM local) est un modèle de langage qui tourne entièrement sur votre propre ordinateur. Aucune donnée ne quitte votre machine. La réponse est générée localement, sans connexion à Internet l'application déployé et le modèle téléchargé.
✅ Pourquoi choisir une IA locale ? - Confidentialité — vos données restent sur votre poste - Conformité RGPD et règlements institutionnels — aucune transmission à des tiers - Utilisation hors ligne possible — une fois le modèle téléchargé, aucun accès réseau n'est nécessaire - Open source et auditable — les modèles sont libres et les poids d'entraitement sont connus et publics.
Pour quels cas d'usage ?
- Résumer ou analyser des rapports, comptes rendus, etc.
- Rédiger ou corriger des documents confidentiels
- Poser des questions sur le contenu de fichiers
- Générer du code ou des scripts sur vos données
- etc.
2. Limites et précautions essentielles
Avant de déployer une IA locale, il est indispensable de comprendre ses limites. Ces outils sont puissants, mais imparfaits.
⚠️ Les hallucinations : un risque réel
Certains modèles peuvent inventer des informations en toute confiance. Des références bibliographiques, des faits, des chiffres — tout peut être fabriqué de façon convaincante mais totalement erronée. Ne considérez jamais une réponse comme fiable sans vérification.
Règles d'or à respecter
- Validation humaine systématique : tout résultat produit par un LLM doit être relu, vérifié et validé par un expert humain avant toute utilisation.
- Ne jamais copier-coller sans relecture : les textes générés peuvent contenir des erreurs factuelles, des biais ou des formulations inadaptées.
- Citer la source originale, pas le LLM : si le modèle reformule un article, vérifiez et citez l'article original.
- Limites de contexte : les modèles légers ont une "mémoire de travail" limitée. De très longs documents peuvent être tronqués ou mal compris.
- Performances inférieures aux grands modèles cloud : les modèles locaux légers (4–8 milliards de paramètres) sont moins puissants que les modeles du style GPT-5 (OpenAI) ou Claude Sonnet/Opus (Anthropic). Ils conviennent à des tâches de résumé, reformulation et assistance à la rédaction, moins à des raisonnements complexes.
🚫 Ne faites jamais confiance aveuglément à un LLM
Un LLM est un outil d'assistance, pas une source d'autorité. Traitez ses réponses comme vous traiteriez une première ébauche rédigée par un assistant — à relire et à corriger impérativement.
3. Présentation breve des quelques outils
Trois outils principaux permettent de faire tourner des LLM en local. Ils sont gratuits, open source et ne nécessitent pas de compte utilisateur.
🖥️ LM Studio — Recommandé pour les débutants
Interface graphique complète (Windows, Mac, Linux). Permet de télécharger, charger et interroger des modèles en quelques clics. Idéal pour découvrir l'IA locale sans ligne de commande. Supporte le glisser-déposer de documents.
🍋 Lemonade AI
Serveur d'inférence local open-source optimisé pour le matériel moderne (GPU et NPU Ryzen AI). Il permet de transformer son PC en serveur d'IA privé grâce à des APIs compatibles OpenAI/Ollama, tout en offrant une interface simple pour chatter et gérer ses modèles. Un peu plus avance que LM Studio.
🔗 lemonade
🔧 AnythingLLM
Application tout-en-un open source permettant de créer des agents IA, d'interroger ses propres documents (RAG), et de gérer plusieurs modèles locaux. Dispose d'une interface web intégrée. Idéal pour les équipes ou un usage avancé en solo.
💡 Notre recommandation pour commencer
Si vous n'avez jamais utilisé d'IA locale, commencez par LM Studio. Lemonade peut etre une alternative. Pour un usage avancé avec gestion documentaire et agents IA, explorez AnythingLLM.
3. Guide d'installation détaillé - LM Studio
Tutoriel express — Découverte pas à pas
Vous n'avez jamais utilisé d'IA locale ? Suivez ce tutoriel pas à pas. Durée estimée : 10 minutes.
Ce tutoriel est basé sur LM Studio (interface graphique, aucune ligne de commande).
Étape 1 — Télécharger LM Studio
🖥️ LM Studio (Windows · Mac · Linux)
Prérequis système : - Windows 10/11 64 bits, macOS 12+, ou Linux (Debian 12, Ubuntu 22.04 ou plus récent, Fedora 39+, Arch Linux ). - Minimum 8 Go de RAM (16 Go fortement recommandé). - 10 Go d'espace disque libre minimum.
Installation :
-
Télécharger depuis lmstudio.ai le fichier correspondant doit correspondre à l'OS de votre ordinateur.

-
Windows : Lancer le
.exe. - macOS : ouvrir le
.dmg. - Linux : rendre le fichier exécutable, puis le lancer :
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImage
ou
apt install ./LM_Studio-*.deb
🍎 Sur Mac Apple Silicon (M1/M2/M3) : télécharger la version ARM. Les modèles GGUF s'exécutent nativement sans configuration supplémentaire grâce à l'accélération Metal.
Erreurs fréquentes :
| Problème | Solution |
|---|---|
| "Windows a protégé votre PC" | Cliquer Informations complémentaires → Exécuter quand même |
| Le modèle ne se charge pas | Vérifier que vous avez assez de RAM libre (fermer les autres applications) |
| Réponses très lentes | Choisir un modèle plus petit (Q4 au lieu de Q8) |
| Erreur "out of memory" | Réduir le paramètre Context Length dans les réglages |
Suivre les options d'installation :
LM Studio propose un petit modèle par défaut : gemma-3-4b. Parfait pour débuter sur un ordinateur peu puissant. ✅ LM Studio s'ouvre. Une interface avec une barre de navigation est observable.
Étape 2 — Télécharger un modèle
- Dans le menu de gauche, cliquer sur l'icône 🔍 Discover.


- Dans la barre de recherche, taper :
nvidia - Dans les résultats, on retrouvera Nemotron 3 Nano 4b.
- Choisir la version 4B — c'est la version compressée, idéale pour un PC standard. Télécharger le modèle choisi, puis le charger.


Spécifications des modèles. Attention : les exigences peuvent différer selon le modèle choisi.
| Modèle | Paramètres | RAM Estimée | Note |
|---|---|---|---|
| Nemotron-3-Nano-4B | 4B | ~5 Go | Ultra-optimisé (Edge/RTX) |
| Nemotron-Mini-4B (Q4) | 4B | 16 Go - 32 Go | Optimisation haute performance |
| Nemotron-Mini-4B (GGUF Q4) | 4B | ~4.5 Go | Usage standard (LM Studio) |
| Type de Quantification | Impact RAM | Recommandation |
|---|---|---|
| Q2 (Léger) | Basse | Pour PC très limités |
| Q4 (Moyen) | Modérée | Équilibre idéal (Recommandé) |
| Q8 (Précis) | Haute | Pour une précision maximale |
Étape 3 — Lancer une conversation
- Dans le menu de gauche, cliquer sur l'icône Chat.

- Dans la zone de texte, taper une première question, par exemple :
Résume en 3 points ce qu'est le RGPD.
- Appuyer sur Entrée ou cliquer sur le bouton d'envoi ➤

✅ Le modèle répond en quelques secondes. Tout s'est passé sur votre ordinateur, aucune donnée n'a été envoyée sur Internet.
Étape 4 — Interroger un document
- Glisser-déposer le fichier directement dans la fenêtre de chat de LM Studio.
- Attendre que le document soit indexé (indicateur de chargement).
- Poser une question sur son contenu :
Comment redémarrer une VM. d'après ce document.
4. Modèles LLM disponibles
Voici une sélection de modèles open source adaptés à un usage local. Ils sont tous disponibles sur Hugging Face et compatibles avec LM Studio ou Lemonade. Choisir en fonction des ressourcces disponibles.
| Modèle | Éditeur | Taille | Points forts | RAM recommandée | Lien |
|---|---|---|---|---|---|
| Mistral 7B Instruct | Mistral AI 🇫🇷 | ~4 Go | Excellent équilibre qualité/vitesse. Très bon en français. Idéal pour débuter. | 8 Go+ | HuggingFace |
| Gemma 3 / Gemma 3n E4B | Google DeepMind | ~4 Go | Optimisé appareils grand public. Très performant pour sa taille. Score Arena ~1300. | 8 Go+ | HuggingFace |
| Llama 3.2 (3B) | Meta AI | ~2 Go | Très léger et rapide. Bon pour les machines modestes. Multilingue. | 4 Go+ | HuggingFace |
| Llama 3.1 (8B) | Meta AI | ~5 Go | Bon généraliste. Raisonnement solide. Large communauté et nombreux fine-tunes. | 12 Go+ | HuggingFace |
| Mistral Nemo 12B | Mistral AI 🇫🇷 | ~7 Go | Très bon en français et langues européennes. Fenêtre de contexte étendue (128k tokens). | 16 Go+ | HuggingFace |
| Phi-3.5 Mini | Microsoft | ~2,5 Go | Conçu pour les appareils à ressources limitées. Bon pour le code et le raisonnement. | 6 Go+ | HuggingFace |
| Mixtral 8×7B | Mistral AI 🇫🇷 | ~26 Go | Architecture Mixture-of-Experts. Qualité proche des modèles cloud. Pour machines puissantes. | 32 Go+ | HuggingFace |
Choisir le bon modèle selon votre configuration
- 4–6 Go de RAM : Llama 3.2 3B ou Phi-3.5 Mini
- 8 Go de RAM : Mistral 7B ou Gemma 3n E4B (format GGUF Q4)
- 16 Go de RAM : Mistral Nemo 12B ou Llama 3.1 8B
- 32 Go et plus : Mixtral 8×7B ou modèles 20B+
- Mac Apple Silicon : performances excellentes même avec 16 Go grâce à la mémoire unifiée
5. Bonnes pratiques IT et sécurité
L'intérêt d'une IA locale repose entièrement sur le fait que vos données ne quittent pas votre machine. Voici les précautions à respecter pour garantir cette promesse.
Ne pas exposer sur Internet
LM Studio et les autres outils ouvrent des ports locaux sur votre machine (ex : 11434, 1234, 3001). Ne jamais ces ports sur le réseau public ou via un pare-feu.
Vérifier les ports actifs
- Sous Windows :
netstat -an | findstr LISTEN - Sous Linux/Mac :
ss -tlnp
S'assurer que les services n'écoutent que sur 127.0.0.1 localhost (local uniquement).
Pour un usage completement hors ligne
Une fois le modèle téléchargé, coupez la connexion Internet pour un usage completement hors ligne.
Ressources matérielles
Les LLM sont gourmands en RAM, CPU et GPU. Si vos ressources sont limitees, fermez les applications inutiles. Sur des machines avec moins de 8 Go de RAM, les performances seront très limitées.
Stockage des modèles
Les modèles Opensources occupent entre 2 et 30 Go d'espace disque. Stockez-les sur un disque local chiffré (BitLocker sous Windows, FileVault sous macOS, LUKS sous Linux), jamais sur un partage réseau ou un service cloud.
Mises à jour
Maintenir ses outils à jour. De nouvelles versions corrigent régulièrement des vulnérabilités et améliorent les performances.
Limites matérielles à connaître
- RAM : c'est le facteur limitant principal. Un modèle trop grand pour votre RAM utilisera la memoire swap, ce qui ralentit drastiquement les performances.
- CPU vs GPU : sans carte graphique dédiée, le modèle tourne sur le processeur. Il faut compter entre 10 à 60 secondes par réponse selon le modèle.
- GPU (NVIDIA/AMD) : avec 6 Go de VRAM ou plus, LM Studio exploite automatiquement la carte graphique pour des performances 5 à 20× supérieures.
- Disque : prévoir entre 20 à 50 Go d'espace libre pour stocker plusieurs modèles.
⚠️ En cas de doute, contactez votre service informatique
Si vous traitez des données très sensibles (données de santé, données judiciaires, secrets industriels), consultez votre DSI ou délégué à la protection des données avant de déployer un LLM local.
Ressources complémentaires
- Hugging Face — Catalogue de modèles open source
- LMSYS Chatbot Arena — Classement comparatif des modèles
- Documentation LM Studio
- AnythingLLM Docs
- Guide UNIL — IA locale pour données sensibles (ressource de référence)



